1 北京林业大学 信息学院
2 国家林业草原林业智能信息处理工程技术研究中心
TL;DR提出全局学习扩展(GLE)嵌入增强网络,融合ViT全局建模与CNN局部特征提取优势,通过多样化嵌入生成和图结构对齐机制显著缩小可见光-红外模态差异
GLE网络由全局特征聚合(GFA)模块和特征多样化扩展(FDE)模块组成。GFA通过循环卷积和位置编码模拟ViT全局建模能力,FDE利用CNN+ViT多分支生成多样化嵌入特征,配合全局特征学习(GFL)损失通过图结构对齐机制减小模态差异。在SYSU-MM01和LLCM上Rank-1分别比基线DEEN提升4.24%和9.05%。
现有方法使用单一CNN或ViT架构,难以平衡全局语义理解和局部细节捕捉。跨模态行人重识别面临可见光与红外图像在颜色、纹理等视觉特征上的显著差异,现有方法忽视跨模态特征对齐,限制了实际应用性能。
通过循环卷积融合ViT全局建模能力到CNN中,利用多分支(CNN空洞卷积+ViT自注意力)生成多样化嵌入,并通过图结构亲和矩阵对齐(KL散度)驱动ViT分支嵌入引导原始特征关注全局信息,同时缩小跨模态差异。
将输入特征分为水平/垂直方向,分别添加可学习位置编码后执行循环卷积,在纯卷积框架下实现全局感受野,同时保持位置敏感性。可嵌入主干网络多个阶段,计算效率高于ViT自注意力。
包含3个分支:分支1-2使用不同扩张率(1,2,3)的3×3空洞卷积捕获多尺度局部特征,分支3采用双头自注意力ViT模块捕获全局特征。所有嵌入与原始特征拼接后输入下一阶段,有效缓解训练样本不足问题。
通过图结构亲和矩阵(KL散度)实现三重对齐:(1)可见光模态下ViT嵌入引导原始特征关注全局;(2)红外模态下同样对齐;(3)可见光与红外原始特征跨模态对齐,生成模态差异更小的嵌入。
整体架构:双流ResNet-50提取可见光/红外初始特征,前3阶段分别接入GFA模块融合局部与全局信息,第3阶段额外接入FDE模块生成多样化嵌入,通过GFL损失约束嵌入质量和模态一致性,端到端联合优化交叉熵+三元组+GFL损失。
GFA通过将特征分为水平/垂直两路,分别添加可学习位置编码后执行循环卷积(堆叠输入并首尾连接形成闭环),在保持位置敏感性的同时实现全局感受野。相较于ViT自注意力,纯卷积实现计算效率更高。
GFL损失构建特征间关系的亲和矩阵(基于欧氏距离的softmax归一化),通过KL散度对齐ViT分支嵌入与原始特征的图结构(传递全局信息),以及可见光/红外模态原始特征的图结构(减小模态差异)。超参数λ1=0.6, λ2=0.6, λ3=0.2时最优。
| Method | SYSU-MM01 R-1 | SYSU-MM01 mAP | RegDB R-1(V→I) | LLCM R-1(V→I) |
|---|---|---|---|---|
| DART | 68.7 | 66.3 | 83.6 | 60.4 |
| MPANet | 70.6 | 68.2 | 82.8 | - |
| DEEN | 74.7 | 71.8 | 91.1 | 62.5 |
| HOS-Net | 75.6 | 74.2 | 94.7 | 64.9 |
| IDKL | 81.4 | 79.9 | 94.7 | 72.2 |
| GLE ours | 78.94 | 76.07 | 94.92 | 71.55 |
GLE在SYSU-MM01全搜索模式达到78.94% Rank-1和76.07% mAP,比基线DEEN分别提升4.24%和4.27%。在LLCM低光照数据集上Rank-1提升达9.05%。消融实验证实FDE+GFL+GFA完整模型比基线提升4.2% Rank-1和4.3% mAP。模型参数量115.20M,推理延迟13.23ms,在可接受范围内。
循环卷积+位置编码可在纯CNN框架下高效实现全局建模,多分支(CNN+ViT)嵌入生成有效缓解样本不足。关键启示:通过图结构亲和矩阵对齐实现跨模态特征分布一致性,是一种简单有效的模态差异减小策略。
@article{guo2026gle,
title={全局学习扩展的可见光-红外行人重识别},
author={郭子强 and 肖璇 and 陶浩然 and 王少荣},
journal={浙江大学学报(工学版)},
volume={60},
number={4},
pages={1--9},
year={2026},
doi={10.3785/j.issn.1008-973X.2026.04.000}
}